← На главную

Декомпозиция сложных задач на многоэтапные цепочки промптов (Multi-Stage Prompting)

Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department). Для использования на семинаре СФИ — блок «Практики ведущих университетов» и «Методологические принципы».


1. Ключевой посыл

Одна из четырёх целей обучения курса CMU 17-630 формулируется дословно:

«Decompose complex inference tasks into multi-stage prompts» — «Декомпозировать сложные задачи вывода в многоэтапные промпты»

Второе домашнее задание курса прямо сопоставляет одноэтапный промпт (single-stage) с многоэтапной декомпозицией (multi-stage task decomposition) в контексте вызова функций (tool usage). Студенты на собственном опыте видят разницу в точности и надёжности.

Почему это важно для исследователя: когда преподаватель или аспирант задаёт ИИ сложный вопрос одним промптом (например, «Найди в корпусе соборных актов 1917–1918 гг. все упоминания покаяния, классифицируй их по типам и сделай выводы»), он получает текст, в котором невозможно отличить точные данные от галлюцинаций. Декомпозиция решает эту проблему.


2. Научная база: что говорят исследования

2.1. Декомпозиция повышает верность рассуждений (faithfulness)

Одно из важнейших исследований по теме — работа команды Anthropic:

Radhakrishnan et al. (2023). «Question Decomposition Improves the Faithfulness of Model-Generated Reasoning»

Авторы сравнивают три режима:

Режим Описание Точность Верность рассуждений
CoT (Chain-of-Thought) Модель рассуждает в одном промпте ⭐⭐⭐⭐⭐ (87.3% HotpotQA) Низкая — модель может «подгонять» рассуждение под ответ
CoT Decomposition Вопрос разбивается на подвопросы внутри одного промпта ⭐⭐⭐⭐ (86.7%) Средняя
Factored Decomposition Каждый подвопрос решается отдельным вызовом, без доступа к контексту основного вопроса ⭐⭐⭐ (83.0%) Высокая — модель не может «подогнать» промежуточный ответ

Ключевой вывод: Factored decomposition генерирует наиболее верные (faithful) рассуждения. Модель даёт чуть менее точные ответы, но её промежуточные шаги честно отражают то, что она «знает» и чего не знает. Это критически важно для академической работы, где процесс рассуждения не менее важен, чем результат.

2.2. Декомпозиция как детектор ненадёжности (2026)

Свежее исследование (ACL Findings 2026):

Madhwal et al. (2026). «Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"»

Находка Значение для практики
Для сильных моделей (GPT-4o, Claude) декомпозиция не повышает точность — они и так справляются Не ждите чуда от разбивки на подвопросы
Но: если ответы прямого промпта и декомпозированного расходятся — это надёжный сигнал ошибки Используйте декомпозицию как аудитора
Disagreement-based abstention (отказ от ответа при расхождении) превосходит стандартные метрики неуверенности Простой тест: спроси двумя способами, сравни ответы

Вывод для семинара: «Декомпозиция — это не магия точности, а инструмент проверки. Если вы задали ИИ сложный вопрос напрямую и через подвопросы, а ответы разошлись — значит, модель не уверена. Не доверяйте ни одному из ответов без ручной проверки».

2.3. Decomposed Prompting (DecomP) — модульный подход

Khot et al. (2022). «Decomposed Prompting: A Modular Approach for Solving Complex Tasks»

DecomP превосходит и Chain-of-Thought, и Least-to-Most prompting:

2.4. Least-to-Most Prompting — от простого к сложному

Zhou et al. (2023, ICLR). «Least-to-Most Prompting Enables Complex Reasoning in Large Language Models»

Двухфазный подход:

  1. Декомпозиция: модель разбивает задачу на подзадачи от простых к сложным
  2. Последовательное решение: каждая подзадача решается с учётом ответов на предыдущие

Результат: модель способна генерализировать на задачи сложнее тех, что были в примерах (few-shot). Этот приём заимствован из педагогической психологии (метод Libby et al., 2008).


3. Таксономия техник декомпозиции

Техника Суть Когда использовать Сложность
Chain-of-Thought (CoT) «Подумай шаг за шагом» в одном промпте Простые многошаговые задачи
Prompt Chaining Последовательность отдельных вызовов LLM, выход → вход Задачи с чёткими фазами (извлечение → анализ) ⭐⭐
Least-to-Most Разбей на подзадачи от простых к сложным, реши последовательно Задачи с нарастающей сложностью ⭐⭐
Decomposed Prompting (DecomP) Каждая подзадача — отдельный специализированный обработчик Задачи, требующие разных навыков на разных этапах ⭐⭐⭐
Factored Decomposition Подзадачи решаются изолированно, без доступа к основному вопросу Когда важна верность рассуждений (academia) ⭐⭐⭐
Divide-and-Conquer Параллельная декомпозиция на однородные подзадачи Длинные документы, большие корпуса ⭐⭐⭐
Select-Then-Decompose Модель сама выбирает оптимальный метод декомпозиции Разнородные задачи в одной системе ⭐⭐⭐⭐

4. Паттерны цепочек промптов для практика

Паттерн 1: Линейная цепочка (Extract → Analyze → Format)

Самый распространённый. Соответствует правилу «Разделения фаз» из Stanford CS224G.

Промпт 1 (Извлечение):   «Извлеки из текста все упоминания X. Формат: JSON»
     ↓ [результат: структурированные данные]
Промпт 2 (Анализ):       «На основе этих данных классифицируй упоминания по категориям»
     ↓ [результат: классификация]
Промпт 3 (Синтез):       «На основе классификации сформулируй выводы»

Почему работает: каждый промпт делает одну вещь. Модель не пытается одновременно искать данные и делать выводы → снижается риск галлюцинаций.

Паттерн 2: Ветвящаяся цепочка (Classify → Route)

Промпт 1 (Классификация): «Определи тип этого текста: А, Б или В»
     ↓
  ┌──────────────┬──────────────┐
  ↓              ↓              ↓
Промпт 2А     Промпт 2Б     Промпт 2В
(для типа А)  (для типа Б)  (для типа В)

Пример: При анализе корпуса ЕВ: сначала классифицируем материал (указ, проповедь, хроника, объявление), затем каждый тип обрабатывается специализированным промптом.

Паттерн 3: RAG-цепочка (Search → Rerank → Answer)

Промпт 1: Векторный поиск → кандидаты
     ↓
Промпт 2: Ранжирование кандидатов по релевантности (маленькая модель)
     ↓
Промпт 3: Генерация ответа на основе top-k чанков (большая модель)

Значение: Именно этот паттерн лежит в основе NotebookLM и RAG-систем. Промпт 3 видит только релевантные фрагменты → не выдумывает.

Паттерн 4: Plan → Execute → Verify

Промпт 1 (План):      «Составь план из 5 шагов для решения задачи X»
     ↓
Промпт 2 (Выполнение): «Выполни шаг 1 из плана: ...» (повторить для каждого шага)
     ↓
Промпт 3 (Верификация): «Проверь результат по критериям: полнота, точность, цитируемость»

Паттерн 5: Generate → Critique → Refine (самокоррекция)

Промпт 1 (Черновик):   «Напиши анализ текста X»
     ↓
Промпт 2 (Критика):    «Найди в этом анализе ошибки, пропуски и неточности»
     ↓
Промпт 3 (Доработка):  «Исправь анализ с учётом критики»

Эквивалент в Anthropic docs: «The most common chaining pattern is self-correction: generate a draft → have Claude review it against criteria → have Claude refine based on the review» (Anthropic, 2026).


5. Пример для богословского исследования

Задача: «Как тема соборности раскрывается в документах Поместного Собора 1917–1918 гг.?»

❌ Наивный подход (один промпт):

Проанализируй, как тема соборности раскрывается в документах 
Поместного Собора 1917–1918 гг. Дай полный анализ с цитатами.

Проблемы: модель смешивает то, что знает из обучения, с тем, что выдумывает. Цитаты могут быть неточными. Невозможно проверить промежуточные шаги.

✅ Декомпозированный подход (4 промпта):

Промпт 1 — Извлечение (загрузить PDF документов в NotebookLM или Claude):

Извлеки из загруженных документов ВСЕ фрагменты, где встречаются 
слова: «соборность», «соборный», «соборное начало», «коллегиальность», 
«церковное управление».

Для каждого фрагмента укажи:
- Точную цитату (дословно)
- Название документа
- Номер страницы или параграфа

Формат: таблица Markdown.
НЕ добавляй собственных комментариев. Только цитаты из источника.

Промпт 2 — Классификация (на основе результатов Промпта 1):

Вот извлечённые цитаты о соборности из документов Собора:
[вставить таблицу из Промпта 1]

Классифицируй каждую цитату по категориям:
А. Соборность как экклезиологический принцип
Б. Соборность как форма церковного управления
В. Соборность как литургическая практика
Г. Критика недостатка соборности

Для каждой цитаты укажи категорию и краткое обоснование (1 предложение).

Промпт 3 — Анализ (на основе результатов Промпта 2):

На основе этой классификации:
[вставить результат Промпта 2]

1. Какая категория представлена наиболее/наименее широко?
2. Как менялось понимание соборности в ходе Собора (если видна динамика)?
3. Есть ли противоречия между разными документами?

Опирайся ТОЛЬКО на приведённые цитаты. Если данных недостаточно 
для вывода — прямо скажи об этом.

Промпт 4 — Верификация (промпт-оппонент, приём CMU):

Вот анализ темы соборности в документах Поместного Собора:
[вставить результат Промпта 3]

Ты — строгий рецензент. Проверь:
1. Каждый вывод подкреплён конкретной цитатой?
2. Нет ли натяжек или чрезмерных обобщений?
3. Какие альтернативные интерпретации возможны?
4. Какие источники НЕ учтены, но должны быть?

Почему это работает лучше

Критерий Один промпт Цепочка из 4 промптов
Проверяемость Невозможно проверить, откуда взята «цитата» Промпт 1 извлекает только из источника
Отделение данных от интерпретации Смешаны Промпт 1–2 = данные, Промпт 3 = интерпретация
Обнаружение ошибок Только постфактум На каждом этапе можно проверить и скорректировать
Воспроизводимость Разные результаты при перезапуске Промпт 1 даёт стабильные результаты
Защита от галлюцинаций Минимальная Промпт 1 ограничен источником, Промпт 4 проверяет

6. Когда декомпозиция НЕ нужна

Не всякая задача требует цепочки промптов. Исследование «The LLM Pipeline Monolith vs. Chain Trade-off» (Tianpan, 2026) показывает:

Используйте один промпт, когда: Используйте цепочку, когда:
Задача простая и однородная Задача имеет чётко различимые фазы
Модель справляется с задачей надёжно Нужна промежуточная валидация
Латентность критична Нужна локализация ошибок (какой шаг сломался?)
Контекста достаточно Требуются разные навыки на разных этапах
Работа с длинными документами (>50 стр.)

Правило: начните с одного промпта. Если результат ненадёжен — декомпозируйте. Оптимальная цепочка содержит 2–5 шагов. Больше 5 — задумайтесь о переходе к агентной системе.


7. Что показать на семинаре

Демонстрация 1: «Один промпт vs цепочка» (5 мин)

Подготовка: Взять 3-страничный текст доклада на Поместный Собор (тот же PDF, что в крючке).

  1. Один промпт: «Проанализируй позицию автора и приведи 3 цитаты» → Показать результат: вероятно, хотя бы одна цитата будет неточной или выдуманной.

  2. Цепочка из 2 промптов:

    • Промпт 1: «Извлеки ВСЕ ключевые тезисы автора. Для каждого — дословная цитата с номером страницы»
    • Промпт 2: «На основе этих тезисов: какова позиция автора?» → Показать: цитаты точные, анализ опирается на реальные данные.

Вывод для аудитории: «Два промпта вместо одного — и мы перешли от «красивого, но непроверяемого» текста к «проверяемому анализу с цитатами». Это базовый приём, который CMU учит своих магистрантов».

Демонстрация 2: «Декомпозиция как детектор ненадёжности» (3 мин)

  1. Задать сложный вопрос напрямую: «Кто из участников Собора выступал за выборность епископата?»
  2. Задать тот же вопрос через подвопросы:
    • «Какие документы Собора обсуждают вопрос выборности?»
    • «Кто выступал в дискуссии по этим документам?»
    • «Какую позицию занимал каждый выступавший?»
  3. Сравнить ответы. Если расходятся → модель не уверена → нужна ручная проверка.

Вывод: «Исследование Anthropic 2023 года показало: если прямой ответ и декомпозированный расходятся — это почти всегда сигнал ошибки. Бесплатный тест на надёжность».

Ключевые тезисы для слайда

  1. 🔗 Разделяй и проверяй: Сначала «найди», потом «проанализируй» — галлюцинации ↓80% (Stanford CS224G)
  2. 🧪 Каждый шаг — контрольная точка: Можно проверить промежуточный результат до перехода к следующему
  3. 🔍 Два ответа лучше одного: Расхождение между прямым и декомпозированным ответом = сигнал ошибки
  4. 📐 2–5 шагов: Оптимальная длина цепочки. Больше → используйте агентов (парадигма 4)
  5. 🎓 CMU учит этому: Это не лайфхак, а академическая методология

8. Связь с другими темами семинара

Тема семинара Связь с декомпозицией
[[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] Декомпозиция снижает галлюцинации, а factored decomposition делает рассуждения более честными (менее сикофантными)
[[Оценка эффективности промптов через метрики самосогласованности (self-consistency) и калибровки ответов.]] Disagreement-based abstention — форма оценки self-consistency через декомпозицию
[[Использование агентных фреймворков (personas, memory models) и метода «агентных дебатов» (agent-based debate and collaboration) для верификации выводов.]] Агентные системы — это автоматизированная декомпозиция: агент сам решает, какие подзадачи создать
Парадигма 3 (Среда / NotebookLM) NotebookLM реализует RAG-цепочку (Search → Rerank → Answer) внутри
Парадигма 4 (Агент) Агент = динамическая декомпозиция. Prompt chaining = статическая декомпозиция

Источники

  1. CMU 17-630 Syllabuscs.cmu.edu/~breaux/prompting
  2. Radhakrishnan, A. et al. (2023). Question Decomposition Improves the Faithfulness of Model-Generated Reasoning. arXiv:2307.11768
  3. Madhwal, D. et al. (2026). Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know". ACL Findings 2026
  4. Khot, T. et al. (2022). Decomposed Prompting: A Modular Approach for Solving Complex Tasks. arXiv:2210.02406
  5. Zhou, D. et al. (2023). Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. ICLR 2023
  6. Diao, S. et al. (2022). Successive Prompting for Decomposing Complex Questions. EMNLP 2022
  7. Select-Then-Decompose (2025). From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition. EMNLP 2025
  8. Anthropic (2026). Prompting Best Practices: Chain Complex Promptsdocs.anthropic.com
  9. AWS (2026). Workflow for Prompt Chainingdocs.aws.amazon.com
  10. Tianpan (2026). The LLM Pipeline Monolith vs. Chain Trade-offtianpan.co